מדוע צריך ביו-אינפורמטיקה: נוצר מצב שבו מצטברים כמויות אדירות של נתונים ביולוגיים שלא ניתן לנתח באופן ידני. בעזרת יכולות חישוביות וכלים סטטיסטיים, ניתן להפיק תובנות חדשות, להבין תהליכים ולבדוק את אמינות הנתונים.
הוזלת עלויות הריצוף: לאורך השנים, עלויות הריצוף הגנטי ירדו בצורה דרסטית, מה שהפך את הריצוף לזמין וזול.
ציר הזמן של התפתחות שיטות הריצוף:
גילוי הדנ"א: הבנת המבנה על ידי ווטסון וקריק.
**ריצוף דור ראשון (ריצוף סנגר): השיטה הראשונה. הייתה מדויקת מאוד אך איטית ויקרה מאוד, כיוון שריצפה אותיות בודדות.
פרויקט הגנום האנושי (1990-2001): פרויקט בינלאומי שהיווה קפיצת מדרגה משמעותית. מעבדות רבות בעולם שיתפו פעולה כדי לרצף את הגנום, מה שהוביל לפיתוח טכנולוגיות מהירות יותר ואלגוריתמים חישוביים (כדי "להרכיב את הפאזל" של הגנום). כיום הגנום האנושי מהווה מודל ייחוס (Reference) להשוואה ואיתור מוטציות.
**ריצוף דור שני (NGS): טכנולוגיות המאפשרות ריצוף בתפוקה גבוהה. ניתן לרצף מיליוני בסיסים במקביל, בצורה מהירה וזולה, ולקבל נתונים מורכבים הדורשים אנליזה ממוחשבת.
ריצוף דור שלישי (Long-Read): מכשירים קומפקטיים (כמו Nanopore, שנראה כמו דיסק-און-קי) המאפשרים ריצוף של מקטעים ארוכים מאוד בזמן אמת.
מעבר מגנוטיפ לפנוטיפ:
רמת ה-DNA (גנומיקה):
הדנ"א מהווה תעודת זהות המעידה על מוצא, משפחה, ומוטציות למחלות.
רמת ה-RNA (טרנסקריפטומיקה):
בחינה של ביטוי גנים (Expression): אילו גנים מתבטאים, כמה הם מתבטאים, ואילו גנים מושתקים.
**ריצוף single cell RNA: ריצוף ברמת התא הבודד המאפשר להפריד רקמה לסוגי התאים השונים שבה (למשל הבחנה בין תא סרטני לתא נורמלי).
רמת החלבון (פרוטאומיקה):
הבנת מבנה החלבון חיונית לפיתוח תרופות, שכן תרופות הן לרוב מולקולות שנקשרות לאתרים ספציפיים בחלבונים.
מודל AlphaFold: מודל בינה מלאכותית של חברת DeepMind שחולל מהפכה - המודל מסוגל לנבא ברמת דיוק של מעל 90% את המבנה התלת-ממדי של חלבון ישירות מתוך הרצף שלו, מה שחוסך שנים של מחקר מעבדתי.
רמת הרשתות (Molecular Networks):
ביולוגיה מערכתית (Systems Biology): חלבונים וגנים אינם פועלים לבד אלא ברשתות. פגיעה בחלבון אחד מרכזי (Hub) משפיעה על מסלולים רבים בתא (למשל חלבון TREM2 באלצהיימר).
רמת התאים והפיזיולוגיה:
רפואה מותאמת אישית (Precision Medicine): יצירת "אטלס" של מחלה, אליו ניתן להשוות את נתוני ה-DNA וה-RNA של חולה ספציפי כדי להתאים לו את הטיפול המדויק ביותר לשלב המחלה שלו.
ניתוח תמונות רפואיות: שימוש במודלים חישוביים ורשתות נוירונים לזיהוי אוטומטי של מחלות וגידולים מתוך תמונות MRI, ללא צורך בניסויי מעבדה.
תהליך ריצוף רנ"א (RNA-seq Pipeline):
הכנת הדגימה במעבדה:
שעתוק ל cDNA: מולקולת ה-RNA אינה יציבה, ולכן משעתקים אותה ל- cDNA (באמצעות Reverse Transcriptase).
הוספת אדפטורים (Adapters): תגים המודבקים לקצוות המקטעים. האדפטורים מאפשרים את הגברת המקטעים ב-PCR ומאפשרים לתוכנה להבדיל מאוחר יותר בין קריאות רבות של גן שנובעות מביטוי טבעי גבוה בתא, לבין קריאות מרובות שנוצרו רק בגלל ההגברה של ה-PCR.
עיבוד הנתונים במחשב:
קובץ FASTQ: הפלט הגולמי ממכונת הריצוף. קובץ טקסט עצום המכיל את רצפי הבסיסים (האותיות) וציון איכות לכל אות.
עימוד (Alignment): יישור של הרצפים הגולמיים אל מול גנום הייחוס (Reference Genome).
טבלת ספירות (Count Table): התוצר של שלב האנליזה. טבלה שבה השורות הן שמות הגנים, והעמודות הן הדוגמאות השונות (הנבדקים). הערכים מסמלים כמה פעמים כל גן התבטא בכל דוגמה.
מאגרי מידע ואנליזה של נתוני ביטוי גנים:
מאגר GEO (Gene Expression Omnibus): מאגר נתונים פומבי של ה-NCBI המכיל נתונים גולמיים ומעובדים (כמו טבלות Counts) ממאמרים שפורסמו. חוקרים מפרסמים שם את הנתונים שלהם כדי לאפשר לאחרים לשחזר ניסויים או לבצע מטא-אנליזה.
אנליזה סטטיסטית באמצעות GEO2R:
כלי מובנה באתר GEO המאפשר השוואה בין קבוצות (למשל: חולים לעומת בריאים, או אזור מוח אחד לעומת אחר) ללא צורך בהורדת הקבצים.
מדד Log2 Fold Change (L2FC): מדד המייצג את יחס השינוי בביטוי הגן (עד כמה הוא עלה או ירד ביחס לקבוצת הביקורת).
מדד P-value / p-adj: מדדים למובהקות הסטטיסטית של השינוי בביטוי הגן.
ויזואליזציה של הנתונים:
גרף Volcano Plot: גרף פיזור שבו ציר ה-X הוא השינוי בביטוי (Log2FC) וציר ה-Y הוא המובהקות הסטטיסטית. הנקודות מייצגות גנים: נקודות בצדדים הגבוהים הן הגנים שהכי מעניינים אותנו (עלו/ירדו משמעותית ובאופן מובהק).
גרפי PCA / UMAP: גרפים המראים כיצד הדוגמאות השונות מתקבצות (Clustering) בהתאם לדמיון הכולל בפרופיל ביטוי הגנים שלהן.
ניתוח מסלולים (GO Enrichment Analysis באמצעות g:Profiler):
הזנת רשימה של הגנים שעלו/ירדו באופן מובהק לתוך כלים חישוביים, שמשווים את הרשימה למאגרי נתונים כדי למצוא לאילו מסלולים ביולוגיים (Pathways) או תהליכים תאיים הגנים הללו שייכים במשותף.